iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0
AI Engineering

同一把尺,30 天橫評 AI Agent Skill:從單篇實測到一份能查的選用指南系列 第 3

Day 3 | 接下來不測我自己做的,先講清楚為什麼、測什麼方向

  • 分享至 

  • xImage
  •  

兩天測下來,我發現一件比任何單一結果都重要的事:這個系列很容易滑向「工具箱文」——裝一個 Skill、講一下感覺、下一篇換一個。要避免這件事,光靠自己小心不夠,得先把接下來要測什麼、為什麼這樣選,講清楚放在這裡,讓我自己也沒有退路。

先回顧兩天看到什麼。Day 1 測 Atomic Commit,發現「任務做對」跟「Skill 被叫到」是兩件獨立的事——有裝跟沒裝,成功率完全一樣,但 Skill 真正被叫到的次數只有一半左右。Day 2 換官方內建的 code-review,發現反過來的版本:有叫到跟沒叫到,抓出來的問題幾乎一樣,差別主要在輸出格式的紀律,不是抓得準不準。兩個結果放在一起看,共同點是:沒有一次是「裝了就變好」這麼簡單的故事。這正是我想保住的東西——每篇都要真的跑過、有機會得出「沒差」這種不討喜但誠實的結論,不是為了寫得好看而先射箭畫靶。

為什麼接下來不測我自己做的

Atomic Commit 是我自己維護的 Skill,Day 1 測它,某種程度是因為手邊現成、最熟。但接下來如果一路測自己寫的東西,讀者很難分辨「這個結論客觀」跟「我當然覺得自己做的東西不錯」——就算我老實寫出負面結果,這個懷疑也很難完全排除。所以從這篇開始,測試對象只挑熱門、有真實使用者、不是我自己做的 Skill;除非哪個我自己做的東西真的解決了具體痛點、擺在同一把尺下也站得住腳,才會再破例收進來,而且會在文章裡明講「這是我自己做的,特此註明」。

另一個原因是我去翻了自己在追蹤的 GitHub 工程知識庫(我平常叫它 star-brain,844 顆 star 依問題域分類)。光是「Agent-Skill 生態」這個問題域就有 30 個 repo,全部是策展清單、市集或 registry——awesome-claude-skillsawesome-codex-skillsclawhub 這類;「Harness 工程」也有近 30 個,全部是在工具,沒有一個在。翻完兩個域,沒有找到一個是「拿固定任務、有無對照、留下數字」這種協定式驗證。這代表我不需要跟幾十份策展清單搶「我知道的 Skill 比較多」,因為那條路已經很擠了;真正空著的位置,是有人願意老實地測、老實地寫沒用的部分。

接下來要測的方向

不鎖每一篇對應哪個 Skill——這兩天已經證明計畫會變(Day 3 本身的主題就換過一次),鎖死「第幾天測誰」只會逼自己硬做,或者回頭改已經發出去的文章。但方向要講清楚,讓這個系列讀起來像有計畫,不是想到哪測到哪:

資安稽核族群:我機器上裝了 Trail of Bits(知名資安研究公司)官方出的一整包 Skill——static-analysis、semgrep-rule-creator、variant-analysis、differential-review、property-based-testing 這些,目前都還沒開啟過。這塊的 claim 很具體可測:真的能抓到埋進去的漏洞嗎?還是只會講一些泛泛的安全建議?

Harness/Loop 族群ralph-loopsuperpowers,都是 Claude 官方市集裡的東西。Ralph loop 這個手法在 agent 工程圈子裡算是有名氣的做法,剛好也呼應這整個賽道的主題——用 Skill 包起來的版本,是不是真的把原本的手法做對了。

記憶與檢索族群claude-memcontext7。這兩個的 claim 是讀者最有感的那種:AI 真的記得住上次講過的事嗎?查文件的時候真的是最新版,不是模型自己編的印象?

跨廠牌工具族群:Figma 官方的設計轉程式碼 Skill、OpenAI 自己的 Codex 整合、一個影片轉逐字稿的 Skill。這組好玩的地方是品牌都不是 Anthropic 自己的,用 Claude Code 的方法去測別家官方工具,會不會有系統性的落差,這件事本身沒什麼人測過。

輕鬆調劑:中間會穿插一兩篇比較輕的,像是一個號稱能讓 AI「不要把答案埋在長篇輸出裡」的小 Skill——claim 小、跑得快,適合放在重內容中間喘口氣,但一樣照同一把尺跑,不因為輕鬆就省掉對照組。

方法本身也還在調整

Day 2 學到一課:不是每個 Skill 都能用 claude plugin eval 跑。內建在執行檔裡的 Skill 沒有 plugin 路徑、沒有 evals/ 目錄,工具直接說找不到,只能換成手動 A/B。接下來每一篇會先確認這個 Skill 能不能用自動化工具測,不能的話就老實說改用什麼方法、為什麼——這件事本身也會被記下來,因為它跟「這個 Skill 到底怎麼運作」一樣,都是讀者該知道的資訊,不是可以跳過的細節。

不變的部分

不管測哪個 Skill、用哪種方法,這幾件事不會變:先有固定任務,再看有無 Skill 的差異;沒實跑過的結果不寫進正文;抓到「沒差」或「更差」照樣發表,不會為了每篇都要有亮點而美化。這是 Day 1 立下的評分尺,Day 3 只是把「接下來測誰」的邏輯講清楚,尺本身沒有變。

明天開始,回到實測。


上一篇
Day 2 | 換官方的來測:code-review 到底在幫我看什麼?
系列文
同一把尺,30 天橫評 AI Agent Skill:從單篇實測到一份能查的選用指南3
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言